最好的编程模型发布两周了,信息流里全是它写代码、控电脑、跑长 Agent 的演示。
可代理公司每天收钱的那件事更无聊:能不能做出一个看起来不像 AI 做的网站。
@PrajwalTomar_ 把这个问题拿去问了 GPT-6 Astra。短答案是:它自己不行。更好的提示词也不行。
你没法把品味提示进模型里。你得先让它看见,什么叫好。
这句话值得贴在显示器上方。后面整套工作流,都是在给它找参考答案,而不是再写一遍“premium, editorial, magazine feel”。
所有 AI 网站长得像亲戚,不是因为模型笨
上周,一位咨询客户上线抱怨:试过能找到的每家 AI 建站工具,出来的都是同一张脸。得体衬线、鼠尾草绿、倾斜悬浮的手机、一句像诗但不办事的口号。
Astra 是作者用过最强的编程模型,它也交了同一张脸。
所以问题不在模型,也不在提示词。人人都在写“高端、编辑感、杂志质感”,然后花两小时跟输出搏斗。那些是品味词。模型不知道旅行品牌的高端、开发者工具的高端、银行的高端分别长什么样。它只能走向自己见过的、所有自称 premium 的网站的平均值。
平均值永远长一个样。
同一周,Griffin Wooldridge 的视频给了出路:把 Astra 接到 Mobbin——一座超过 60 万张、来自真实已上线 App 和网站的界面库——让模型先研究真东西,再动手。研究在前,构建在后。
作者当晚拿自己的项目复现。思路是 Griffin 的;下面是他跑出来的结果,以及代理公司为了能接真客户多加的几步。
同一产品,打两轮,只改一件事
实验产品叫 TripGlide,一款旅行预订 App。产品已经做完,一直没有落地页。旅行品牌是好考题:设计就是产品,丑页面留不住订单。
两轮共用同一个产品、同一个模型、同一份 brief。
第一轮:ChatGPT 里的 Astra,用 Sites 直接建站。
第二轮:给 Astra 接上 Mobbin MCP,让它在改页面前先翻真实上线界面。
Mobbin 不是赞助。他们代理公司付费用了大约一年,MCP 只是让模型自己去翻,而不是人肉贴图。不想付费也有免费版,后文会写。
第一轮 brief 原文很长,核心就一句:做成高端数字旅行杂志,顺便能预订。要有产品预览 Hero、使用方法、精选目的地、行程功能、社会证明、定价、FAQ、页脚。编辑排版、大留白、克制动效、完整响应式,需要的图自己生成。
十分钟十三秒,整站出来了。模块齐,能适配,图也有。它还老实声明:预订和支付只是预览,评价和定价是示例文案。
第一眼好看。这就是陷阱。
它不是弱模型那种灰扑扑的 Bootstrap 页。它是另一种通用:AI 高级感。看过五十个,下一秒就能认出来。
第一轮究竟露馅在哪
不是代码崩了。代码合格。露馅的是品味的平均值。
一部倾斜五度的手机,一张悬浮的“安心卡片”,生成图上印着 GPS 坐标,闪光点,太阳图标,明信片编号。六件随机道具都在演编辑感,没有一件在说产品是什么。
每个区块同一套标题公式:直立衬线,再跟一段鼠尾草绿斜体。“From what if to we're here.”“A plan for the trip. Room for the magic.” 一个好点子重复到变成模板。
文案像旅行,不说功能。“少开标签页,多起飞。”“少规划,多生活。”听得见氛围,看不见 App。
同一张阿马尔菲照片用了四次:主视觉、手机屏、卡片、行程弹窗。
手机模型里的字是 6px,产品预览不可读,只是摆设。
定价是编的,评价被自己标注成“示意旅行者故事,示例文案”。
模型从没被认真展示过,一个真正出色的旅行网站会做什么,于是它猜。它猜的结果,和所有 AI 工具猜的结果一样。
第二轮真正值钱的,不是重建,是那份报告
接入 Mobbin 大约两分钟:ChatGPT 里找 Apps,搜 Mobbin,授权。需要 Pro 及以上,免费套餐连不上。作者第一次连接失败,第二次才通,计划里要给这次来回留时间。
然后他做了大多数人会跳过的一步。不说“做得更好”。先研究,先写报告,批准之前不准动工。
研究提示词要求四件事:准确指出当前页面哪里像模板、像 AI;归纳最强真实案例的重复模式;提出更清楚的视觉方向;列出每一处改动和理由。
报告才是这套方法的产品。它逼模型把学到的东西摊开,再允许它花在你的页面上。
模型翻了 14 个真实界面,覆盖旅行站、旅行 App 和消费品牌,交出一份 28 项改动计划。第一句几乎把整场实验说完:
TripGlide 大件都在,但它是在用堆砌的装饰和可替换的语言,假装自己是高端旅行。
堆砌的装饰。可替换的语言。所谓 AI premium,七个字就够。
它骂自己的 Hero:太多熟悉的落地页装置在抢戏,画面缺少一个组织性想法。
骂自己的字体:一种有效处理,在几乎每个区块重复后变成公式。
骂自己的文案:反复对比、碎片句、打磨过的情绪,造出一种人造节奏。
骂目的地卡片:几乎没有决策支持。“大山。更安静的心”可以形容很多地方。
参考对象包括 KOBU 酒店页、Airbnb 发现流、Wanderlog 按天行程、TravelPerk 的 Hero、KÖPPEN、Face Formula。它从真站点里抽出六条公约数:
一个主导视觉想法;人们真正想要的具体事物;放对位置的清楚行动;图旁边就要有信息;大图和小细节各干各的;用真实产品证据,而不是道具。
方向被收成一句:TripGlide 是旅行编辑的精选,旅程已经可以开始规划。粉笔底、近黑正文、深橄榄按钮。标题一种衬线,实用信息一种无衬线。斜体偶尔用,而不是每个标题都用。
改动清单也不化妆。拿掉悬浮卡、太阳、坐标、闪光。停止复用那张阿马尔菲。把 6px 标签加到可读。重写 Hero,让它说出产品做什么。还有两个意外:删掉示例评价,因为伪造引言无法承担社会证明;在没有真实商业模型之前,先撤掉编造定价。
它也没有吹牛。移动端只标成风险,因为还没做浏览器检查;并写明“generic”是设计判断,不是检测 AI 作者的可靠方法。
作者说,这比多数代理公司一周交付的设计评审更像样。他回了一句:批准。按报告改现有站点。
十一分钟后,新版本挂在同一个 URL 上。
对照看完,才会相信“看过真东西”有多重要
新 Hero 只有一个主意,正是报告要求的。手机还在,但已经在人手里,并且在做事:Discover、Plan、Travel 三个标签,屏幕跟着切。这是报告从 TravelPerk 抽出来的结构——手里的产品,周围是有用的标注,而不是倾斜五度的道具。
手机旁边的卡片开始说人话。“海景住宿。波西塔诺,阿马尔菲海岸。”“把拉韦洛加进去。”上一轮悬浮卡写的是“一段像你的旅程”,什么也没说。
坐标、闪光、太阳、明信片编号消失了。导航变成 Destinations、How it works、The experience,按钮直接写 Explore the preview。
每个目的地终于有自己的行程。京都打开的是京都六日,有二年坂和东山;多洛米蒂打开的是从 Dobbiaco 出发的五日。上一轮每张卡都打开同一周阿马尔菲。报告把这叫决策支持,现在卡片里终于有一点。
行程从一张倾斜的“纸”变成可读的深橄榄产品面板。Day 01、02、03,上午下午晚上,并印着 Example stay, not reserved——这个站还不能预订,它选择把话说在前面。
它删掉了自己的谎。示例评价没了,假定价没了。FAQ 开始回答真问题:我能预订住宿或体验吗?这些照片是可预订地点吗?
然后是演示从不给你看的那一段。
它仍不完美。衬线加斜体的标题公式还在页上。“Your whole trip. Beautifully together.”“A little structure. A lot of freedom.” 报告点名过的那个破绽,模型自己又用了三次。若是客户站,这是作者会打回去的唯一一处文案。
可两版 Hero 并排时,结论已经够硬:同一个模型,同一份 brief,同一个产品。唯一改变的,是它动手之前看过什么。
第二轮之后,不要再把整页交给模型
永远会剩一处不对。永远。
错法是写“标题少一点诗意”,再放模型满页改。对的部分会跟着变坏。
之后每一次只围一道篱笆,句式固定:
一次修复,范围仅限某区块。只改这一处。其他什么都不要动。
放到这个站上,就是:一次修复,范围仅限标题文案。重写那三句衬线斜体,让它们说出产品的具体事情。其他什么都不要动。
这一句,往往比原始 brief 里所有品味词都更有用。
客户项目里,演示会跳过的四步
Griffin 的视频停在前后对比,作为演示足够。代理公司多做的几步,才是这套方法能在真项目上站住的原因。
先写设计系统。颜色、字号阶梯、间距、组件,一篇短文档,模型必须先读。没有它,研究阶段会把和品牌打架的模式一起拖进来。
再做页面研究。永远用那份四段式报告提示,不要说“做得更好”。研究、报告、等待。
构建之后先查移动端,再对仍然别扭的那一个区块做第二次研究。总有那么一块。只研究它,不要再碰整页。
最后把模式存进项目笔记。同一品类的下一个客户,从这些模式起步,而不是从零起步。
最后一步会复利。研究不是为这一页服务,它会变成一份越来越厚的品味档案。
不想付 Mobbin,流程仍然成立
免费版只是更慢。
打开品类里 10 到 12 个你真心佩服的真网站。每家截 Hero、一个内容区块、页脚。丢进对话,研究提示词里把“用这个 MCP”换成“研究这些截图”。
其余步骤不变。
你失去的是广度。60 万张界面和 12 张截图不是一个量级。你保住的是那件真正要紧的事:先研究,再构建。
限制也要说在客户电话之前。Mobbin MCP 需要 Pro,每次搜索消耗 AI 额度且没有公开单价;连接可能第一次失败;报告质量取决于提示词,“研究设计模式”只会得到摘要,四段式才会得到 28 项计划;Astra 喜欢在你只要改一个区块时重建整页,所以每次都要点名区块;模型可能贴得太近,报告若反复指向同一参考站,构建前要让它扩大样本;版式变好很快,照片仍会落后;这是营销站工作流,App 内界面作者仍从设计系统起步。
整张施工单可以收成一行:
Brief → 第一稿 → 接入真实参考 → 研究报告(先等)→ 第二稿 → 标注每一处改动 → 移动端检查 → 对弱区块做一次带篱笆的修复
设一次,每张落地页都跑,存下模式,下一次构建就从品味开始,而不是从零开始。
客户同一周拿到了网站。工作流留在了代理公司。实验的全部意义,也在这里。
写在最后
评测榜单奖励的是会写、会跑、会操作电脑。客户付钱买的是:这页看起来像一个有判断力的品牌,而不像一千个提示词的平均值。
Astra 很强,强到能在十分钟里交出一个完整、响应式、自带图的站点。也强到能把“高级旅行”猜成倾斜手机、鼠尾草绿和可替换金句。
差别不在会不会写代码,在动手前有没有被要求看过真东西,并且先交出一份它自己都得遵守的报告。
今晚你若只改一个习惯,就改这个:不要再对模型说“高端、编辑感、杂志质感”。先给它 12 张真截图,或一座真正上线过的界面库,让它写报告,你批准,再允许它碰页面。
品味不是一句形容词。品味是参考系。模型没有自己的参考系时,它会把整个互联网的平均值,当成你的品牌。




No comments yet